Méthodes de Monte Carlo

5. Contrôle sans l'hypothèse de l'exploration des départs : stratégies de type $\varepsilon$-soft

L'objectif est maintenant de trouver des stratégies optimales sans avoir besoin d'utiliser une hypothèse de l'exploration des départs. Il faut toujours que l'agent sélectionne une infinité d'actions et pour cela on va jouer cette fois-ci sur les probabilités liées aux choix des actions lorsqu'on est dans un état particulier. On va donc faire en sorte que pour chaque action disponible dans un état la probabilité de la sélectionner soit non nulle, c'est-à-dire $\pi \left( {a|s} \right) > 0$, et faire en sorte que l'action la plus intéressante ait une probabilités plus importantes que les autres. On appelle ce genre de stratégies des stratégies $\varepsilon$-soft.

Dans les faits on va donc donner une probabilité minimale de $\frac{\varepsilon }{{\left| {A\left( s \right)} \right|}}$ pour toute les actions non optimales et le restant des probabilités,$1 - \varepsilon + \frac{\varepsilon }{{\left| {A\left( s \right)} \right|}}$, pour l'action optimale. Dans ce cas on aura toujours la relation $\pi \left( {a|s} \right) > 0$ qui sera vérifiée.

L'idée générale de la méthode utilisée dans ce cas est encore basée sur l'itération généralisée des des stratégies (GPI). C'est donc les itérations réalisées sur la fonction des valeurs des actions qui va nous permettre d'optimiser la stratégie en tenant les probabilités adéquates aux différentes actions des états de l'environnement.

Algorithme